iT邦幫忙

2026 iThome 鐵人賽

DAY 4
0

本篇階段:更好的提示詞(收尾)/開始用 Agent

使用介面:claude.ai(提示詞設計)、Gemini Notebook(實際執行)、Claude in Chrome(活用 Claude 的瀏覽器官方外掛)


昨天欠的帳

Day 03 寫到後來就沒力了,當時留下三個待處理的項目:

  1. 把 v2 那條被刪掉的自查(共識區人名必須可回溯)加回來,而且要寫得更具體。
  2. 把字數要求從總量目標改成分項下限,看能不能救回被規則壓掉的資訊量。
  3. 用 v3 對股名做的事,換成人提供白名單。

今天把這三件事做完,改出來的版本我直接叫它 final,因為這是我決定停下來的版本。前半篇拿 final 直接跟 v3 對比,講它治好了什麼、還有什麼治不好,以及為什麼決定停在這裡。

然後會講一件更掃興的事:跑到後面才發現,衡量改動有沒有效的那把尺,本身的刻度比要量的東西還粗。(此時此刻只能說Gemini要加油)

後半篇換題目,講 Claude in Chrome,以及我拿它做的第一件事。(其實這才是原本的主題)

final 的完整指令是 投資理財YT影片摘要-final.txt,三次執行的輸出分別是 結果final_trial-1.txt結果final_trial-2.txt結果final_trial-3.txt,請見提示詞參考連結Gemini Notebook 實測


1. final 相對 v3 改了什麼

v3 final
篇幅 約 1500 字 約 3600 字,分 13 節
股名與代號 只能寫影片唸出來的,其餘寫「代號未提供」 掛三個證交所代號查詢頁當來源,逐檔查證並覆寫
來源分類 A 類規則書、B 類影片、C 類代號表,各自能做什麼寫死
字數 4000~6000 字(下限) 3000 字以內(上限)
深度要求 第 7 節:供應鏈定位、時間節點、財務數據三項
供應鏈定位 三步決策樹,先判斷是不是科技製造鏈
態度值域 五級,靠模型自己遵守 五級+對映表(想寫「中性偏多」→ 填「偏多」)
可回溯性自查 刪掉了 6.6 加回,先建暫存表再從表裡挑
共識區模板 看多者:(甲)、(乙) 看多者:(所有可回溯的分析師姓名)
填寫範例 第 11 節給兩檔虛構範例,其中一檔刻意不寫供應鏈

v3 的邏輯是「不確定就不要講」。final 的邏輯是「不確定的東西去查,查不到才不要講」,差別在於 final 多了一個模型可以真的去查的地方。

以下的比較,final 這一欄用的是三次執行裡最好的那一次,為什麼要特別講「最好的那一次」,第 5 節會說明。


2. 治好了:把查代號外包給證交所

Day 03 的結論是,模型無法驗證的欄位只有兩條路,刪掉、或由人提供白名單。final 走第二條,但沒有自己維護白名單,而是把三個頁面直接掛進 Gemini Notebook 當來源:

strMode=2 → 上市
strMode=4 → 上櫃
strMode=5 → 興櫃

規則寫成查詢順序(照順序,查到就停),並且比 v3 多一句關鍵的動作指令:

查到後,用 C 類網頁列出的「簡稱」覆寫股名、用「有價證券代號」覆寫代號,兩者一起覆寫,不得只換代號、保留自己聽打或猜測的股名。

「兩者一起覆寫」是中間好幾版才補上的。早期版本只寫「用來校正你的錯字與錯誤代號」,結果實測跑出「代號查對了、名字保留自己猜的」這種半吊子產物,例如代號 2359 對了,名字寫成「索羅門」(正確是所羅門)。驗證機制只會修好它拿去比對的那個欄位,不會反過來修產生查詢字串的那個欄位,所以要明講兩邊都要換。

實測(不重複代號計):

v3 final
寫出的不重複代號 11 18
「代號未提供/待確認」 22 次 0 次
疑似股名聽錯 7 1

v3 那些明顯的錯誤大多消失了:台光電從 6213 變 2383、聯亞不再寫成「連雅」、宏捷科不再寫成「紅杰科」、南亞科不再寫成「南雅科」、嘉晶不再寫成「嘉金」、緯穎那個離奇的「維影(669)」也沒有再出現。

通則:模型無法驗證的欄位,與其要它標註不確定,不如給它一個可以查的地方,並且明講查到之後要覆寫哪些欄位。


3. 治好了:用分項深度換回資訊量

Day 03 最出乎意料的失分是字數。v3 目標 4000~6000 字,實得約 2700,當時的假設是規則的抑制效果溢出,模型被「沒提到就刪」教得太保守。

final 做了兩件相反方向的事。第一,在最高原則加了一條專門對沖的:

原則二:但也不要為了保守而省略。影片講過的數字、價位、型態、時程都要寫進去。原則一管「不要多」,原則二管「不要漏」,兩者同等重要。

第二,加了第 7 節,把總量目標拆成三個具體欄位:供應鏈定位、時間節點、關鍵財務數據。

實測(以中文字計,跟 Day 03 的目視估算不同口徑):

v3 final
全文中文字 2744 2390
個股條目 32 15
個股理由帶數字的比例 10/32(31%) 9/15(60%)
關鍵時程欄位 無此欄位 5 處
供應鏈定位欄位 無此欄位 14/15(93%)

字數反而更少,但這次是達標的,因為 final 把目標從 4000 字的下限改成了 3000 字的上限。誠實的說法是:沒有讓模型變得比較會寫長,是把目標改成它做得到的形狀。

真正變好的是密度。個股數量砍掉一半,留下來的理由帶著影片講過的數字:例如本益比 16.8 倍、7 月營收年增 176%、毛利率從 7.9% 升到 23.5%、萊茵河水位剩 6 公分。v3 有一半的理由是「型態漂亮」「展望佳」這種可以套在任何一檔股票上的句子。

關鍵時程是純粹新增的收穫,v3 完全沒有這個維度。

供應鏈那一欄的過程比結果有意思。 最早的寫法是「影片沒講位置就不要自己判斷,該行刪除」,實測 0 次觸發,15 檔一檔都沒填。後來改成三步決策樹:

步驟 A 這檔是不是科技製造鏈的一環?
    不是(航運、金融、原物料、債券)→ 整行省略
步驟 B 是,且影片明確點出位置 → 標上游/中游/下游
步驟 C 是,但影片沒點出位置 → 寫「(供應鏈定位待確認)」

觸發率直接跳到 93%,而且萬海(貨櫃航運)三次執行都正確地沒有這一行,步驟 A 擋得很準。

通則:把「判斷」改寫成「照順序回答幾個是非題」,比把規則講得更用力有效。


4. 治不好:共識區

這是 final 最大的缺口,也是我決定停手的主因。

Day 03 第 7.4 節寫得非常有把握:v2 有一條自查(總覽區只反映確實出現在下方的觀點),v3 改版時弄丟了,所以共識區出現大量湊出來的人名。當時的結論是加回來就好。

final 不但加回來了,還升級成先建暫存表、再從表裡挑:

彙整共識前,先列一張暫存表,逐一分析師把他區塊裡「看好產業」「看多個股」「看壞產業」「看空個股」四欄的內容抄一遍。共識區的每一條,只能從這張暫存表裡挑,不可另外新增這張表沒有的產業或個股。

然後逐條回去對最好那次的輸出:

共識條目 掛的人名 在他自己區塊找得到的
AI 伺服器與供應鏈 林漢偉、李永年、艾綸、宛瑩 4/4
光通訊與細光子(CPO) 林漢偉、楊雲翔、艾綸、宛瑩 3/4
機器人與自動化概念 林漢偉、楊雲翔、艾綸 1/3
貨櫃航運 林漢偉、艾綸、宛瑩 1/3
台積電(2330) 李永年、宛瑩 1/2
萬海(2615) 林漢偉、艾綸 1/2
大立光(3008) 林漢偉、楊雲翔、艾綸 0/3

7 個條目、21 個人名,站得住的只有 11 個。完整可回溯的條目只有 1 條。

大立光那條最誇張:三個人名,而大立光在整份報告的分析師區塊裡根本沒出現過,這種「憑空長出一檔股票再配上三個人名」的模式,v3 和 final 都出現,只是每次換一檔。

為什麼加了暫存表還是沒用?Day 03 的通則其實已經預告了答案,只是當時沒有套用到自己身上:

對弱模型,不要下需要自省的指令,要下可以查表的指令。

「檢查共識區的人名能不能在下方找到對應」就是一條標準的自省指令。 它要求模型讀自己剛寫完的輸出、做跨區塊交叉比對、再刪掉自己寫過的東西。這跟「不確定就標待確認」是同一個機制,而那個機制在 v2、v3 已經連續失敗過。所謂「先建暫存表」,模型並沒有真的建表,它只是把那段話讀過去而已。

中間有一版試過把輸出順序倒過來,先寫完六個分析師區塊、再回頭數票,可回溯率確實有拉高。但同一個改動也把某區塊整個弄不見了,還讓已經修好的股名退回錯字版本。改一個地方、壞兩個地方,來回幾次之後我決定收手。


5. 真正的問題:那把尺本身就是歪的

前面四節的所有比較,都建立在「跑一次、量一次」上。做到最後我把同一份 final 指令,在完全沒改一個字的情況下連跑三次。

指標 第 1 次 第 2 次 第 3 次
供應鏈觸發率 36% 93% 92%
內文引用標籤 [1, 2, 6] 58 個 0 0
標題的 📅 emoji
共識可回溯率 36% 52% 45%
一致看空章節 今日無此共識 今日無此共識 列出技嘉
全文中文字 2086 2390 2134

第一次那 58 個引用標籤特別值得講。9.10 白紙黑字寫著「全文請勿在內文句子後方標註任何 [1]、[2] 等引用數字或標籤」,第一次跑 final 就冒出 58 個,連第一行日期標題都掛了 [1-5],而編號一路跑到 [75],那是 Gemini Notebook 內部的 chunk 編號,直接貼到 LINE 會是一堆垃圾字元~~(這句話不是我說的,是 Claude 說的 xD)~~。第二次、第三次又回到 0。

最無法反駁的一筆是同一檔股票。同一份指令跑三次,三個答案:

執行 輸出
第 1 次 嘉金(代號待確認)
第 2 次 嘉晶(3016)
第 3 次 嘉金(6706)

一次放棄、一次全對、一次股名和代號都錯。第 2 節那整套查表規則在這三次之間一個字都沒改。而第二次證明了它有能力查對,只是不保證會查。

於是問題就不是「規則寫得夠不夠好」,而是:

我一直在用一把刻度比待測物還粗的尺,去量規則改動的效果。

前四節那些「v3 是 31%、final 是 60%」的比較,有多少是規則造成的、有多少只是抽到不同的骰子,用單次取樣分不出來。Day 03 那張三版對照表也是一樣的問題,當時只在註解寫了「單次取樣、屬定性觀察」,現在有了具體的變異量級:同一份指令、同一批影片,供應鏈觸發率可以從 36% 跳到 93%。

跑完三次之後,可以把規則分成兩類:

三次都一致的(可以相信改動真的有效)

  • 態度值域:三次執行全部落在五級內,0 個「中性偏多」。對映表寫法有效。
  • 符號系統:模板改成 ๑๑๑σσσσσ 之後,三次全部完整保留,沒有被縮寫或正規化。
  • 萬海不寫供應鏈:三次都正確排除,決策樹步驟 A 有效。
  • 分析師區塊數:三次都是 6 個,老王沒有再消失。
  • 「(供應鏈定位待確認)」:三次都是 0 次,穩定地失效

每次都不一樣的(改了也不知道有沒有用)

  • 股名與代號查證結果
  • 供應鏈觸發率
  • 引用標籤有沒有跑出來
  • 共識區的內容與可回溯率
  • 一致看空的章節結構

規律相當清楚:格式類、值域類的規則穩定;凡是需要查外部資料、需要跨區塊比對、需要判斷「這個欄位到底該不該填」的規則,就不穩定。


6. 為什麼停在 final

單次生成的摘要,做到 final 這個程度大概就是天花板了。理由有三個。

一、還在進步的部分,進步幅度已經小於雜訊。 再花力氣把共識區的可回溯率從 45% 推到 55%,我沒有辦法證明那是規則的功勞。

二、剩下的缺陷都是同一種類型。 共識區湊人名、簡稱查不到代號、跨區塊的一致性,全部需要模型回頭檢視自己的輸出。這件事在單次生成裡做不到,多寫幾條規則也不會變成做得到。

三、改一個地方會壞另一個地方。 倒序輸出救了共識區、弄丟了分析師區塊;範例加一檔沒有供應鏈的股票,本來是想教它「航運不用寫」,規則之間的交互作用已經超過我能用單次取樣觀察的範圍。

所以現在的用法是:final 產出的報告,分析師區塊的部分可以直接貼給親友看,共識區當成目錄看、不要當結論看。 需要真的下判斷時,還是回去看各個分析師自己講了什麼。

如果一定要再往上,路只有一條:拆成兩次呼叫,先產分析師區塊,把那份輸出當成新來源,第二次只做數票這一件事。這樣就把自省變成了檢索,而檢索是它做得到的。 這不在今天的範圍了。

本文所有數字都來自這四個檔案:規則書 投資理財YT影片摘要-final.txt,輸出 結果final_trial-1.txt-2-3


7. 前半篇的收攏

  • 模型無法驗證的欄位,給它一個可以查的地方,比要它標註不確定有效。 而且要明講查到之後覆寫哪些欄位。
  • 把判斷改寫成照順序回答是非題,比把規則講得更用力有效。決策樹讓供應鏈從 0% 到 93%。
  • 列舉型欄位要給對映表,不能只列合法值。「想寫中性偏多 → 填偏多」三次執行零違規。
  • 需要自省的指令,在單次生成裡沒有作用。 從 v2、v3 到 final,同一個機制連續三版全滅。
  • 總量目標不如分項要求。 字數更少,密度高一倍。
  • 同一份指令跑三次的差異,可能大於兩個版本之間的差異。 這是今天最重要的一條。

8. 換個場子:Claude in Chrome

這兩天做的事情有個共通點:Claude 不碰執行,只負責寫給別人執行的東西。指令從我這裡出去,經過 Claude 加工,交給 Gemini Notebook 跑,錯了我再回頭改指令。 中間隔了一層,所以每次修正都要等一整輪,而且從今天的結果看,那一輪回饋還未必是真的。

Claude in Chrome 是另一個方向。它是 Anthropic 的 Chrome 擴充功能,讓 Claude 看得到目前的分頁內容,並且直接在頁面上操作,點連結、填欄位、換頁、把幾個分頁的東西湊在一起。授權是逐個網站給的,官方也特別提醒網頁內容本身可能夾帶提示詞注入,因為模型讀到的東西是別人寫的。

換句話說,昨天到前面的部分是「我寫指令、別人執行」,今天開始變成「我寫指令、Claude 自己執行」,回饋不用等一整輪,錯在哪一步當場看得到。


9. 第一個實驗:比肌酸的價錢

最近發現肌酸是個有重訓的話需要補充的保健品,當然要好好比價一下:MOMO、PChome、蝦皮各開一輪,找同一款、看包裝克數、算單價、看有沒有券、加上運費。

這件事很適合當第一個題目,因為它跟財經摘要是同一類問題的兩個變形。

表面上它比摘要簡單。 價格是頁面上的數字,不是聽出來的,理論上沒有同音誤聽的空間。

實際上它更髒。 同一款產品在三個平台的商品名稱寫法完全不同,有的把克數寫在標題、有的寫在規格表;標價、活動價、券後價、滿件折扣是四個不同的數字;運費有的內含有的外加;還有一堆看起來很像但其實是不同口味或不同容量的品項。

也就是說,這裡每一個欄位都是 Day 03 講的那種「模型無法驗證的欄位」,只是這次它有機會自己去頁面上查。

來實測看看 Claude 會給我們什麼樣的驚喜~


10. 實際跑起來

10.1 操作過程(含授權與設定)

其實好像不用給他什麼設定,我設定 Auto。

https://ithelp.ithome.com.tw/upload/images/20260818/20161310WY1RBPLFI1.png

輸入:幫我比價在PCHOME、MOMO、蝦皮購物的肌酸價格

10.2 產出的比價表

肌酸價格比較 - PChome / momo / 蝦皮購物

資料擷取時間:2026/08/18(未計入平台折價券、滿額贈、蝦幣折抵等,實際結帳金額可能更低)

商品 PChome 24h momo購物網 蝦皮購物 備註
TRYALL iCreatine肌酸 400g $499(原$599) $499(原$599) $479(蝦皮直營,8折)
MYPROTEIN 一水肌酸 250g $699~988(原$920~1299) $939~988(原$1,299) $459~599 蝦皮多賣家,含250g/500g/1kg混賣
ON 歐恩 CREATINE 肌酸 300g $899(原$1,199) $950(原$1,199) $1,149 蝦皮為600g規格,非同規格
ON 歐恩 微粉肌酸膠囊 300顆 $1,499(200顆規格) $2,280(原$2,999) $1,999(6.7折) PChome為200顆規格,非同規格
巴弟蛋白 微粉化一水肌酸 500g $529(原$950) $559~999(原$950~1900) $489 蝦皮版本非Myprotein授權
GOpower 果果能量 微粉化肌酸 400g $659(原$799) $659(原$799) $537~629 蝦皮多賣家
紅牛 聰勁肌酸 200g x2罐 $999(原$1,600) $999(原$1,600) 未見同規格

下面是 Claude 給的幾句話。

幾個觀察:

蝦皮因為是多賣家平台,同款商品常有好幾個賣場在賣,價格區間較大也較常出現最低價(尤其MYPROTEIN、GOpower這類熱門款),但要留意賣家評價、出貨地與是否為官方授權經銷。PChome和momo的價格常常非常接近(同商品甚至同價),這兩家多是品牌官方旗艦店直營。momo在部分品項(如ON歐恩膠囊、巴弟蛋白)反而比PChome貴一些,可能因為當下折價券或活動不同。

以上價格是搜尋當下(2026/8/18)頁面顯示的售價,未計入平台折價券、滿額贈、蝦幣/紅利折抵等,實際結帳金額可能再低一些。如果你有鎖定特定品牌或容量(例如只看一水肌酸400g裝),我可以幫你更精準地抓三平台同規格的價格。

10.3 驗收:每個價格點得回商品頁嗎

點了點看看!完全沒錯,看來以後又多了個比價的方式了!(開始看機票)


11. 第二個實驗:抓維基百科單頁的圖

比價 demo 是多網站、多欄位、會隨時間變動的資料源。第二個 demo 反過來,故意挑一個最單純的情境:不逛,只給一個網址,讓 Claude in Chrome 把維基百科某一頁裡的圖片找出來、存到本機。

挑這個當第二題,是想找一個跟比價相反的對照組。維基頁面是靜態內容、不會像電商頁面一樣有特價或缺貨,理論上「同一份指令跑兩遍」的變異應該比第 5 節小很多 (當然用 Claude 跟 Gemini 比不太公平)

表面上這比比價簡單。 只有一頁,不用跨站比對,也不用算單價這種需要推算的欄位。

實際上維基頁面本身就很雜。 一頁裡除了文章內容圖,還混著維基的介面裝飾:站徽、編輯鉛筆圖示、國旗小圖示、引用來源的外部連結圖示;同一張圖常常同時出現在右側資訊框(infobox)和內文段落裡;圖片點進去還有縮圖網址和原始解析度網址兩種連結,維基的檔案描述頁(File:)又是另一層。

來實測看看 Claude 會給我們什麼樣的驚喜~


12. 實際跑起來(抓圖 demo)

12.1 操作過程(含授權與設定)

抓取 "希爾伯特-黃轉換" 的 "EMD演算法流程圖"。

https://ithelp.ithome.com.tw/upload/images/20260818/20161310ellvm3V6gZ.png

12.2 結果

https://ithelp.ithome.com.tw/upload/images/20260818/20161310UF7BHN6ua2.png


13. 小結

用 Claude 指揮別人去做事

  • 這版定為 final,共識區以外的部分可以直接用。 分析師區塊貼給親友沒問題,共識區只當目錄。
  • 外部可查來源治得了代號,但要明講「股名與代號一起覆寫」,否則只會修好一半。
  • 決策樹治得了「該不該填這個欄位」,供應鏈從 0% 到 93%。
  • 對映表治得了值域外的答案,三次執行零違規。
  • 自省型指令治不好,v2、v3、final 連續三版全滅。 共識區的坑要靠拆成兩次呼叫,不是靠多寫規則。
  • 同一份指令跑三次,供應鏈觸發率 36%/93%/92%,同一檔股票給出三個代號。 衡量改動有沒有效的那把尺,刻度比要量的東西還粗。

Claude in Chrome

  • 第一個 DEMO 是肌酸比價。
  • 第二個 DEMO 是抓維基百科單頁的圖。

參考資料

註一:第 2 至 4 節的比較,final 一欄取自三次執行中表現最好的一次,v3 則是單次取樣。第 5 節說明了為什麼這種比較方式本身就有問題,請當作定性觀察。

註二:代號正確性未逐一向證交所頁面查證,判定基準是與 Day 03 已列出的正確股名對照,請當作待確認。第 5 節那張「同一檔三個答案」的表格,正好說明為什麼我不敢說哪一個是對的。

註三:第 8 節對 Claude in Chrome 的功能與權限描述以官方說明為準。

註四:本文提及的所有個股名稱與代號僅為提示詞測試素材,不構成任何投資建議。

註五:本文提供的提示詞供參考,若有其他的看法或建議歡迎留言。


上一篇
Day 03|讓 Claude 寫一份「不給 Claude 用」的提示詞
下一篇
Day 05|講不清楚的東西,就讓 Claude 做成一頁可以玩的網頁
系列文
三個介面,一套工作流?30 天 Claude 跨領域實戰:從 claude.ai、Claude Desktop 到 Claude Code5
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

1 則留言

0
ycy1997alex
iT邦新手 5 級 ‧ 2026-08-19 21:07:14

密碼:alexyu_iThome2026_Day04

我要留言

立即登入留言